
輝達(Nvidia)近期釋出開源語音 AI 模型 PersonaPlex-7B,最大特色是能同時進行聽取與語音生成,突破了傳統語音助理一次只能聽或說的限制,讓人機對話更自然流暢。此模型具有 70 億參數,可處理插話及重疊語音,輝達期望藉此推動 AI 語音技術的普及與硬體銷售。
輝達(Nvidia)近期開源一款名為 PersonaPlex-7B 的語音 AI 模型,這項技術最大的突破在於能讓 AI 助理同步進行聽取和語音生成,擺脫了傳統語音助理「一言我一語」的對話限制,朝向更自然的人機互動邁進。
這款 PersonaPlex-7B 模型特別設計來處理自然的對話情境,包括人類交談時常出現的插話、重疊語音等狀況,與過去必須等待對方說完才回應的語音 AI 系統大相徑庭。PersonaPlex-7B 採用一種雙流架構,其核心是同時運作兩個流程:一個負責處理使用者輸入的語音,另一個則負責生成 AI 的回應語音及文字,兩者共用底層的模型狀態,實現即時互動。
PersonaPlex-7B 是一個 70 億參數的模型,能在單一 GPU 上運行。輝達的測試數據顯示,該模型能達到 90.8% 的輪流對話率,而插話反應延遲時間甚至低至 240 毫秒,首次生成回應的 Token(AI 處理的基本單位)時間約為 170 毫秒,展現出其快速且流暢的互動能力。
PersonaPlex-7B 已於 2026 年 1 月 15 日釋出其權重於 Hugging Face 平台,程式碼則公布在 GitHub 上。輝達採取的開源策略,旨在讓開發者無需支付 API 費用,就能運用這項全雙工語音模型(能同時輸入與輸出語音的模型)進行開發與測試。輝達希望透過普及其底層技術,鼓勵更多應用程式採納,進而帶動其 GPU 等硬體產品的銷售。此舉也為業界設立了可重複驗證的公共效能基準。
